메뉴

#KV 캐시

TD
The Decoder • 16일 전
IMP 8

딥시크, V4.1-Flash 공개…AI 에이전트 메모리 요구량 대폭 절감

딥시크(Deepseek)가 새 멀티모달 모델 V4.1-Flash를 공개했다. KV 캐시를 대폭 축소해 긴 컨텍스트 처리 시 GPU 메모리 사용량을 전작 대비 약 1/4로 줄이고, 입력 처리 연산량도 절반 가까이 낮췄다. 코딩 벤치마크에서는 오픈AI·앤스로픽의 최상위 폐쇄형 모델과 대등한 성적을 보이지만, 복잡한 과학 과제와 이미지 분석에서는 여전히 격차가 있다.

딥시크 KV 캐시 AI 에이전트
HN
Hacker News • 56일 전
IMP 7

버스트성 LLM 추론을 위한 KV 캐시 예측 복제 기술

사용자 트래픽이 특정 시간에 집중되는 '버스트성(Bursty)' 환경에서 대형 언어 모델(LLM)의 추론 성능을 극대화하는 기술이 깃허브에 공개되었습니다. 트래픽 폭주를 예측하여 KV 캐시(Key-Value Cache)를 미리 복제해두는 방식을 통해, 서버 과부하나 지연 없이 빠르게 응답을 처리할 수 있도록 돕는 것이 핵심입니다.

LLM 최적화 KV 캐시 추론 성능
MP
MarkTechPost • 100일 전
IMP 8

KV 캐시 압축 기술 경쟁: TurboQuant vs OSCAR vs EpiCache

최근 긴 문맥(Long Context)을 처리하는 AI 모델에서 모델 가중치보다 KV 캐시가 차지하는 메모리 비중이 훨씬 커지는 병목 현상이 발생하고 있습니다. 본 글은 이러한 메모리 문제를 해결하기 위해 등장한 TurboQuant, OSCAR, EpiCache 세 가지 기술의 접근 방식을 분석하며, 이들이 서로 경쟁하기보다는 각자 다른 측면을 보완해 주는 관계라고 설명합니다.

KV 캐시 메모리 최적화 대규모 언어 모델
HN
Hacker News • 131일 전
IMP 7

트랜스포머의 자기회귀 예측과 KV 캐시

대규모 언어 모델(LLM)이 토큰을 생성하는 핵심 원리인 '자기회귀 다음 토큰 예측'과 추론 속도를 획기적으로 높이는 'KV 캐시' 최적화 기법을 설명합니다. 이 과정을 통해 모델이 텍스트를 벡터로 변환하여 디코더 블록을 거치고 다음 단어를 예측하며, 이후 반복적인 연산을 줄여 긴 문장을 빠르게 생성할 수 있게 되는 원리를 이해할 수 있습니다.

LLM 트랜스포머 KV 캐시